MedScope: A Lightweight Benchmark of Open-Source Large Language Models for Medical Question Answering
本論文は、医療分野における軽量オープンソース大規模言語モデルの性能を、精度だけでなく推論時間や一貫性などの多角的な指標を用いて包括的に評価するベンチマーク「MedScope」を提案し、これらのモデルが現状では高リスクな医療現場での自律的な展開には至っていないが、透明性のある基盤として価値があることを明らかにしています。